外观
课程导航
生信入门 B-2:scRNAseq 入门到 UMAP 注释
#生信 #单细胞分析 #Seurat #PBMC3k #可视化
这组截图记录了从 R 环境准备到计数矩阵、质控、降维、聚类和细胞类型注释的 Seurat 基础流程。它用于说明每一步应查看什么,不应被当成一套可盲目复制的固定参数。
1. 准备 R 与 RStudio
R 是执行分析的语言,RStudio 是编写脚本、查看变量和绘图的开发环境;两者需要分别安装。从 R 项目官网进入 CRAN 镜像,先选择操作系统,再选择与本机架构匹配的安装包。


完成 R 安装后再安装 RStudio Desktop。首次启动时,Console 应能显示 R 版本且没有“找不到 R”的提示。


在 Console 中运行 R.version.string、getwd() 和 sessionInfo(),记录 R 版本、工作目录、操作系统和已加载包。后续遇到包安装或结果无法复现时,这是最基本的排查记录。
2. 创建对象与质量控制
读入计数矩阵后,先确认 Seurat 对象的基因数、细胞数和 assay。如果这些量级与数据来源明显不符,应先停下检查路径、文件方向和条形码。

质控图把每个细胞的检测基因数、UMI 计数和线粒体转录本比例放在一起。阈值应结合样本类型和分布设定,不要只照抄示例数值。

3. 标准化与高变基因
NormalizeData() 会对细胞间的测序深度差异做基础校正。运行日志只能说明函数执行完成,还需通过数值摘要和后续图形判断结果。


高变基因用于把降维的注意力集中到细胞间变化明显的特征。需要同时看特征数、方差标准化过程与被选中基因的位置。


4. PCA 降维与主成分选择
PCA 先把高维表达数据投影到一组正交主成分。基因载荷摘要用来理解每个主成分主要受哪些基因驱动,散点图用来检查细胞是否出现粗略分离。


主成分热图帮助判断载荷模式是否具有可解释性;肘部图则用于选择后续构图和聚类所需的 PC 数。肘部并不是唯一标准,还应查看不同 PC 数下聚类的稳定性。


5. 构图、聚类与 UMAP
Seurat 通常先在选定的 PC 空间构建近邻图,再用 Louvain 等方法寻找社区。resolution 会改变聚类粒度,因此需记录该参数并比较多个值。

UMAP 把近邻关系投影到二维用于展示。轴本身没有固定生物学含义;解读时应关注群之间的相对邻近、混合和分离,不要把图上距离当成精确尺度。


6. Marker 基因与细胞类型注释
Marker 计算是在当前聚类与其他细胞之间做表达比较。需要检查最小表达比例、差异倍数阈值、检验方法和多重比较校正,不应只看排名最前的基因。


细胞类型注释要结合多个正向 Marker、排除性 Marker、样本背景和可靠的参考资料。下图是将聚类编号改为细胞类型名称后的展示结果,不是独立的注释证据。

最小复现记录
保存结果时至少一并保存:原始数据来源与校验值、R 和 Seurat 版本、过滤阈值、随机种子、使用的 PC 数、聚类 resolution 和完整脚本。截图只能辅助解释,不能代替数据和代码。
这些截图为仓库已有的 PBMC3k 实操记录;原始捕获日期、作者和生成脚本尚未在仓库中记录,因此不应将其当成可独立复现的分析证据。R 与 RStudio 网页截图的来源元数据也不完整,重用前应确认官网品牌与截图使用规则。